Skip to content

Simulating party shares

Cohen, Hanretty (2023)

DisciplineSocial science
MethodComputational
Tagselectoral outcomesmethod · formal modelingmethod · simulationparty systemsprobabilistic modelingseat share distribution

Summary

Problem: 研究人员在需要模拟给定规模(即给定席位获胜政党数量)的政党体系的席位和选票份额时,缺乏现成的方法。现有的方法要么只能扰动已有的选举结果,无法处理需要从零开始(ex nihilo)模拟的情况;要么依赖确定性的模型(如Taagepera和Allik 2006),无法回答“单一政党获得多数席位的概率是多少”这类概率性问题。 Approach: 本文提出使用Dirichlet分布(包括无序和有序两种形式)来模拟政党体系的席位和选票份额。该分布的均值向量由Taagepera和Allik(2006)提出的公式给出,该公式仅依赖于政党排名和席位获胜政党数量两个参数。作者通过一个标量浓度参数α和位置向量p来参数化Dirichlet分布,其中α从真实世界数据中估计。 Finding: 使用标准(无序)Dirichlet分布,并以Taagepera和Allik(2006)的公式作为均值向量,可以生成非常接近真实世界的政党体系。该“逻辑模型”的拟合优度(以RMSE衡量)几乎与饱和模型(为每个排名和体系规模组合设置参数)相当,且校准度接近名义水平。相比之下,“政治调整”模型拟合更差,有序Dirichlet分布的表现也普遍不如无序版本。 Significance: 这项研究为政治学研究者提供了一种简单、易用且经过验证的工具,用于模拟政党体系。这使得研究者能够回答关于政党体系结果概率的基本问题,例如单一政党多数或联盟形成的可能性,这在以前是无法令人满意地回答的。

Theoretical Framework

  • Theoretical tradition: 该论文属于政治学中关于政党体系与选举制度的量化研究传统,特别是与“席位-选票”关系的逻辑模型(logical models of electoral systems)相关。
  • Prior theories built upon: 论文直接建立在Taagepera和Allik(2006)提出的席位(选票)份额的确定性公式之上。该公式通过反复取逻辑极端的几何平均数来推导。此外,论文还引用了Shugart和Taagepera(2017)关于“席位乘积”(seat product)和席位获胜政党数量的工作,以及Laver和Benoit(2015)关于联盟形成算术的研究。
  • Causal mechanism: 论文的核心机制是统计分布(Dirichlet分布)与经验规律(Taagepera和Allik公式)的结合。公式提供了席位或选票份额的期望值(位置),而浓度参数α则量化了围绕这些期望值的离散程度。通过从该分布中抽样,可以生成具有现实特征的、有序的政党体系。
  • Key assumptions: 理论假设给定规模的政党体系(即给定N0)的期望席位或选票份额可以由Taagepera和Allik(2006)的公式准确描述。此外,模型假设不同规模的政党体系共享一个共同的浓度参数α,该参数可以从数据中估计。
  • Theoretical move: 本文应用扩展了现有的理论。它将Taagepera和Allik(2006)的确定性模型从点预测扩展为概率分布,从而使其能够回答概率性问题。论文并未挑战该公式的有效性,而是将其作为更复杂统计模型的核心组成部分。
  • Scope conditions: 模型的适用范围受限于其训练数据。ParlGov数据主要覆盖欧洲和议会制国家,不包括总统制国家和加勒比海地区的小型议会制民主国家。作者认为,在给定政党数量的条件下,这些系统的期望份额不太可能有显著不同,但浓度参数α可能存在差异。

Research Design

本文是一项计算模拟研究,结合了统计模型拟合和模型评估。分析单位是选举。关键的因变量是政党的席位份额和选票份额,它们是有序成分数据(ordered compositional data)。自变量是政党在体系内的排名(i)和政党体系的规模(N0)。作者将席位/选票份额建模为Dirichlet分布或有序Dirichlet分布的随机变量。分布的均值向量(p)由不同模型指定(见下),浓度参数(α)则从数据中估计。

Data & Sample

  • N: 813次选举,来自37个不同的国家。
  • Population: 议会制和半总统制国家的选举。
  • Country/Region: 全球范围,但主要覆盖欧洲(ParlGov数据库的覆盖范围)。
  • Recruitment or data-collection method: 使用现有的ParlGov数据库(Döring and Manow 2021)。该数据库记录了1945年后或完全民主化后的所有选举,以及少数国家1900年后的选举。政党若获得超过1%的选票或两个或以上席位则被纳入。
  • Time period: 主要是1945年之后,部分国家从1900年开始。
  • Data source: ParlGov数据库。

Analytical Strategy

作者在Stan中估计了四种不同的模型,分别用于席位份额和选票份额数据,并分别使用无序和有序Dirichlet分布,共14个模型:

  1. 零模型(Null model): 位置向量p由1/N0给出,α被估计。
  2. 逻辑模型(Logical model): 位置向量p由Taagepera和Allik(2006)的公式(1)给出,α被估计。
  3. 政治模型(Political model): 位置向量p由Taagepera和Allik(2006)的“政治调整”公式(2)给出,α被估计。
  4. 饱和模型(Saturated model): 位置向量p为每个政党体系规模(N0 = 2,...,20)和排名分别估计,α被估计。

模型通过以下指标进行评估:

  • RMSE: 选举层面的均方根误差,然后跨选举平均。
  • 校准度(Calibration): 计算实际观察值落在后验分布5%和95%分位数之间的比例,理想值为90%。
  • NS(或NV)的比例误差: 模拟的有效政党数与实际有效政党数之差除以实际值。
  • s1(或v1)和s2(或v2)的比例误差: 模拟的最大党(和第二大党)份额与实际值之差除以实际值。

Results & Findings

  • 逻辑模型表现优异: 对于席位份额,逻辑模型的RMSE为7.75个百分点,仅比饱和模型(7.24)高约7%。其校准度为87.4%,接近名义水平。对于选票份额,逻辑模型的RMSE为6.34,同样接近饱和模型(5.81)。这表明,仅依赖两个参数的Taagepera和Allik公式,在作为均值向量时,几乎能像为每个排名和规模组合都设置参数的饱和模型一样好地拟合真实数据。
  • 政治模型拟合更差: 与预期相反,加入了“政治调整”的政治模型在RMSE和校准度上均不如逻辑模型。例如,在席位份额模型中,政治模型的RMSE为8.06,高于逻辑模型的7.75,且校准度仅为79.5%,远低于逻辑模型的87.4%。这挑战了Taagepera和Allik(2006)关于政治调整模型拟合更好的结论。
  • 无序Dirichlet优于有序Dirichlet: 在所有比较中,有序Dirichlet分布的拟合(以RMSE衡量)都差于无序版本。例如,在席位份额的逻辑模型中,无序版本的RMSE为7.75,而有序版本为9.30。尽管有序版本的校准度更高(94.8% vs 87.4%),但考虑到其计算复杂性和更差的整体拟合,作者认为其“不值得增加复杂性”。
  • 有效政党数的高估问题: 除了政治模型外,所有模型(包括饱和模型)都倾向于高估有效政党数(NS)。逻辑模型(无序)高估了约9%(席位)和4%(选票)。政治模型则严重低估了有效政党数(席位-6%,选票-11%)。
  • 对s1和s2的估计准确: 逻辑模型对最大党和第二大党份额的估计非常准确,其误差接近于零,且90%置信区间包含零。这表明逻辑模型在捕捉政党体系的核心特征方面是可靠的。

Limitations

  • 数据覆盖范围: ParlGov数据不包括总统制国家和欧洲以外的小型议会制民主国家(如加勒比海地区)。作者认为这不太可能影响期望份额,但承认浓度参数α可能存在异质性。
  • 平局处理: 有序Dirichlet分布要求份额严格有序,但现实中存在席位平局的情况。作者通过添加或减去可忽略的值来处理,但这是一种近似处理。
  • 无法直接使用解析性质: 使用有序Dirichlet分布时,无法直接使用标准Dirichlet分布的一些有用的解析性质(如方差的表达式)。
  • α的异质性: 作者在补充材料中承认,在总统制民主国家中估计的α值略小,表明α可能存在跨选举子集的异质性。他们建议研究者如有需要,可以使用其模型对特定子集进行估计。

Key Contributions

  • 首次展示了如何使用无序和有序Dirichlet分布,结合Taagepera和Allik(2006)的公式,从零开始模拟给定规模的政党体系。
  • 通过系统的模型比较,证明了基于Taagepera和Allik公式的“逻辑模型”在拟合真实世界数据方面几乎与饱和模型一样好,且远优于“政治调整”模型。
  • 提供了明确的实用建议:推荐使用标准(无序)Dirichlet分布,并给出了席位份额(α≈40)和选票份额(α≈50)的浓度参数参考值。
  • 提供了配套的R包(`sharesimulatoR`)和交互式网页工具,使其他研究者能够轻松使用该方法。
  • 通过模拟,能够回答以前无法回答的概率性问题,例如“单一政党获得多数席位的概率是多少”(在5党体系中约为1/4),为选举制度评估和联盟形成研究提供了新的工具。

Key Claims

"We show that a distribution with a mean vector given by the rule described in Taagepera and Allik (2006, Electoral Studies 25, 696–713) fits real-world data almost as well as a saturated model where there is a parameter for each rank/system size combination." (Abstract)

"Our results show that realistic looking party systems of a given size can be simulated using a (standard, unordered) Dirichlet distribution where mean seat or vote shares are given using Equation (1), and where the concentration parameter is roughly 40 (for seat shares) or 50 (for vote shares)." (Section 8, Conclusion)

"Given the greater ease of use of the unordered Dirichlet distribution, the ordered Dirichlet does not repay its greater complexity." (Section 7, Results)

"The political models, which might address the issue of over-estimating NS, provide a worse fit to the data, as measured by RMSE." (Section 7, Results)

"In our view, the questions which we can now answer with this method of simulation ('what is the probability that a single party will have a majority?' and 'what is the probability that no two parties will have a majority') are simple questions which are fundamental to the operation of a party system, and which could not have been satisfactorily answered without the simulation methods given here." (Section 8, Conclusion)


My Notes